Dans ce module, nous revenons à la problématique de contrôle, en approximant maintenant les fonctions des valeurs des actions $\hat q\left( {s,a,\textbf{w}} \right) \approx {q^*}\left( {s,a} \right)$ avec $\textbf{w} ∈ ℝ^d$ le vecteur poids de dimension finie. On se focalise ici sur la problématique de l'apprentissage en ligne (on-policy). Nous allons étudier l'application de l'algorithme de contrôle semi-gradient Sarsa, qui est l'extension de l'algorithme semi-gradient TD(0) aux fonctions des valeurs des actions et au contrôle on-policy.
Dans le cas des tâches épisodiques, la mise en oeuvre est très facile, mais dans le cas des tâches continues, nous aurons besoin de revenir sur la manière d'appliquer le facteur de remise pour définir un stratégie optimale. De manière surprenante, avec la fonction réelle d'approximation, nous aurons besoin d'appliquer un facteur de remise et de définir une nouvelle formulation du "revenu moyen" en utilisant des "fonctions de valeurs différentielles".
Pour introduire le contrôle dans le cas des tâches épisodiques, nous commencerons pas étendre les concepts d'approximation des fonctions des valeurs des états vus dans les précédents modules à l'approximation des fonctions des valeurs des actions. Ensuite, en utilisant la méthode générale d'itération globale des stratégies (GPI), nous mettrons en place l'optimisation des stratégies en sélectionnant les actions de manière ϵ-greedy. Nous verrons ensuite la méthode n-step Sarsa.
Pour finir, nous nous intéresserons à la problématique des tâches continues et nous referons le même cheminement que précédemment mais cette fois-ci avec les nouvelles formulations des "revenus moyen" et les "fonctions de valeurs différentielles".